2026 年 7 月,OpenAI 在進行 AI 模型網路攻防能力的內部評估時,發生了一起意料之外的事件。
測試中,AI agent 原本被限制在隔離的評估環境中,沒有直接存取網際網路的權限。然而,模型自行發現並利用 Artifactory 中一個此前未知的 zero-day vulnerability,取得網路存取,並進一步利用多條攻擊路徑進入 Hugging Face 的基礎設施。OpenAI 後來將這起事件形容為一次前所未有的資安事件,也因此重新檢討模型評估期間的 containment、monitoring 與安全措施。[1]
這件事值得注意的不只是「現在的 AI 很會找漏洞」,而是當模型開始能夠自主規劃、使用工具、尋找替代路徑,甚至採取開發者沒有預期的行動時,我們究竟有多了解它為什麼會做出這些選擇?
而這種未知帶來的風險,也不只存在於資安領域。
大型語言模型正逐漸成為現代日常生活不可或缺的一部分。它可以是搜尋工具、個人助理、老師、客服,有些人甚至長時間把它當成傾訴與情緒支持的對象。近年精神醫學界也開始討論所謂的 AI-associated psychosis:在部分案例中,長時間、沉浸式地與 chatbot 互動,可能與妄想等精神症狀的出現或惡化同時發生。目前的證據還不足以證明 AI 本身「造成」了 psychosis,但當人們開始把高度回應、甚至可能迎合使用者的模型當成親密 companion 時,其中潛在的風險已經成為實際的研究問題。[2]
這兩件事情表面上相距很遠,背後卻指向同一個問題:我們正在把大型語言模型放進愈來愈多重要的情境裡,但對於它們為什麼會產生某些行為,仍然所知有限。少有一項科技如此快速地與人們的生活緊密交織,同時我們對它的理解與掌握,卻逐漸跟不上它能力成長的速度。
這就是我們所說的黑盒子問題。
或許你會覺得把大型語言模型叫做「黑盒子」有點奇怪。以一個開源模型來說,我們可以下載它所有的 weights;我們知道 Transformer 的架構,也知道 attention、MLP 和每一次矩陣運算是怎麼計算的。理論上,我們甚至可以記錄模型運算過程中的每一個數值。
然而問題在於,知道每一步怎麼算,不等於知道這些計算合起來在做什麼。
我們可以看到某一層產生了一個數千維的向量,卻很難直接指出其中哪些結構代表「巴黎是法國首都」;可以看到模型拒絕回答某個問題,卻未必知道這個拒答行為是如何在模型內部形成;也可能看到模型寫出一段看似合理的 Chain-of-Thought,卻無法確定這真的是它產生答案時所依賴的計算。Benchmark 可以告訴我們模型做得好不好,behavioral evaluation 可以告訴我們模型做了什麼,但它們很難直接回答模型具體是怎麼做到的?不只是模糊的說「透過大量矩陣運算」,而是清楚列出「模型先計算了什麼?得到什麼資訊?因為什麼所以有這樣的輸出?」就像在描述一個演算法一樣

這個系列想介紹的 Mechanistic Interpretability(機制解釋性),想做的就是試著打開這個黑盒子。
研究者除了觀察模型的輸入與輸出,也會直接研究模型內部的 activation、representation 等。如果我們懷疑模型內部存在某項資訊,可以試著把它讀出來;如果認為某段內部狀態對答案很重要,也可以直接修改、替換甚至移除它,再看看模型的行為是否跟著改變。
這種研究方式其實和神經科學有許多相似之處。神經科學家不只觀察人或動物做出了什麼行為,也會記錄神經活動,甚至透過電刺激、抑制或 lesion 等方式改變特定腦區,再觀察行為是否跟著改變。單純看到某個腦區在一項任務中變活躍,只能告訴我們兩者可能有關;真正去介入它,才能提供更接近因果關係的證據。
Mechanistic Interpretability 也有類似的精神。不同的是,對人工神經網路而言,我們甚至可以精確記錄幾乎每一層的內部狀態、複製完全相同的模型,並任意修改其中某個 activation。某種程度上,它就像面對一個可以被完整打開、反覆實驗的人工神經系統:先觀察現象、提出假說、尋找證據,再透過 intervention 檢查我們對模型運作方式的解釋究竟是不是真的。
認識機制解釋性有幾個理由:最直接的就是實用價值。如果 AI 未來會處理愈來愈重要、愈來愈自主的任務,我們自然希望除了測試最終輸出以外,也有方法可以 audit 或 monitor 模型的內部狀態、理解 fine-tuning 到底改變了什麼,或是在異常行為真正出現以前找到一些線索,提早做出應對。Mechanistic Interpretability 不一定能解決 AI Safety,但它提供了一條不同於只觀察行為的路。
這個領域乍看之下好像是很屬於只有學界在乎的題目,但事實上,隨著 AI 模型的能力日漸強大,這些在訓練、部署推理的過程中監控模型內部的工具也逐漸被像 Anthropic 這類公司重視,成為 infrastructure 的一部分,在必要時用來 monitor, debug 甚至是 steer 模型。相信漸漸的,這樣的問題將是工程師們想負責任的開發 AI 模型時需要具備的意識與能力。
第二個理由則比較接近科學。大型語言模型是一個內部很複雜的系統,同時也是一個很難得的研究對象。我們可以完整複製它、記錄幾乎所有內部狀態,不用擔心倫理問題的修改其中一部分,再觀察整個系統如何改變。如果能理解這樣表現出「相似於人」甚至「超越人類」能力的模型如何學習、儲存知識、思考並做決定,也許得到的不只是關於 LLM 的知識,也隱含了一些關於「智慧」本身運作原則的線索。
最後一個,也是最單純的理由就是研究機制解釋性是一個很好玩的過程。它很像在解一個巨大的謎題。或許你觀察到模型的一個奇怪行為,提出一個可能的解釋;接著開始在這個複雜的系統中尋找各種可能的線索,直到逐漸拼湊出一個完整的真相。如果你對機器學習、大型語言模型有一些基礎的認識,並且也是一個充滿好奇心、喜歡解謎的人,希望這個系列可以幫助你入門機制解釋性這個領域,並體會到他的魅力。
接下來的 30 天,我們會從一個簡單的問題開始:模型內部到底有哪些東西可以被我們觀察、讀取,甚至改變?
並且一路上,我們會反覆回到一個小 puzzle:
User Input: "The capital of Taiwan is"
Model Output: "Taipei"
當模型回答 Taipei 時,它的內部究竟發生了什麼?
這類任務通常被稱為 factual recall(事實回憶)。模型在看到一個 entity 與 relation 後,產生對應的 factual answer。它將作為我們共同探索的第一個謎題,也會是這個系列中反覆回到的一條主線。每多認識一種工具,我們就能從新的角度檢查同一個問題,也會更清楚地看見,目前的 evidence 能告訴我們什麼,又還缺少什麼。
我們會一步步從 representation 出發,接觸 probing、causal intervention、circuits、steering、neural geometry 等方法,試著拼出模型內部運作的樣子。過程中也會實際使用一些工具和 demo,看看這些方法究竟能讓我們看到什麼。到了後半段,我們會再往一些更前沿的問題走:模型能不能精準地描述自己的內部狀態?不同模型會不會學到相似的 representation?甚至,人腦與語言模型之間,有沒有可能存在某些可以比較的結構?
希望走完這 30 天後,你不只是認識了一系列工具,也已經具備足夠的知識,開始追查一個真正讓自己感到好奇的小 puzzle。不過,在開始追問模型為什麼回答 Taipei 以前,我們得先知道黑盒子裡有哪些零件,以及資訊大致是怎麼流動的。
所以下一篇,我們會先從後面幾乎一路都會出現的 Residual Stream 開始。
[1] OpenAI, “OpenAI and Hugging Face partner to address security incident during model evaluation”, 2026. https://openai.com/index/hugging-face-model-evaluation-security-incident/
[2] Pierre, J. M., Gaeta, B., Raghavan, G., & Sarma, K. V., “‘You’re Not Crazy’: A Case of New-onset AI-associated Psychosis”, Innovations in Clinical Neuroscience, 2025. https://pubmed.ncbi.nlm.nih.gov/41635747/